<!DOCTYPE html>
<html class="client-nojs vector-feature-language-in-header-enabled vector-feature-language-in-main-page-header-disabled vector-feature-page-tools-pinned-disabled vector-feature-toc-pinned-clientpref-0 vector-toc-not-available vector-feature-main-menu-pinned-disabled vector-feature-limited-width-clientpref-1 vector-feature-limited-width-content-enabled vector-feature-custom-font-size-clientpref-1 vector-feature-appearance-pinned-clientpref-0 skin-theme-clientpref-day vector-sticky-header-enabled" lang="de" dir="ltr"><head>
<meta charset="UTF-8">
<title>Extraktionsalgorithmus nach Luhn</title>
<meta name="viewport" content="width=device-width, initial-scale=1.0">
<link rel="icon" type="image/png" href="./_res_/favicon.png">
<link rel="canonical" href="https://de.wikipedia.org/wiki/Extraktionsalgorithmus_nach_Luhn"> <link href="./_mw_/ext.math.styles.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.wikimediamessages.styles.css" rel="stylesheet" type="text/css">
<link href="./_mw_/skins.vector.icons.css" rel="stylesheet" type="text/css">
<link href="./_mw_/skins.vector.search.codex.styles.css" rel="stylesheet" type="text/css">
<link href="./_mw_/skins.vector.styles.css" rel="stylesheet" type="text/css">
<meta name="ResourceLoaderDynamicStyles" content="">
<link href="./_mw_/ext.gadget.citeRef.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.defaultPlainlinks.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.dewikiCommonHide.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.dewikiCommonLayout.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.dewikiCommonStyle.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.dewikiDarkmode.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.dewikiResponsive.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.specialSearch.css" rel="stylesheet" type="text/css">
<link rel="stylesheet" type="text/css" href="./_mw_/site.styles.css">
<link rel="stylesheet" type="text/css" href="./_mw_/noscript.css">
<link rel="stylesheet" type="text/css" href="./_res_/footer.css">
<link rel="stylesheet" type="text/css" href="./_res_/vector-2022.css">
</head>
<body class="skin--responsive skin-vector skin-vector-search-vue mediawiki ltr sitedir-ltr mw-hide-empty-elt ns-0 ns-subject page-Extraktionsalgorithmus_nach_Luhn rootpage-Extraktionsalgorithmus_nach_Luhn skin-vector-2022 action-view">
<div class="mw-page-container">
<div class="mw-page-container-inner">
<div class="mw-content-container">
<main id="content" class="mw-body">
<header class="mw-body-header vector-page-titlebar">
<h1 id="firstHeading" class="firstHeading mw-first-heading"><span class="mw-page-title-main">Extraktionsalgorithmus nach Luhn</span></h1>
</header>
<a id="top"></a>
<div id="bodyContent" class="vector-body ve-init-mw-desktopArticleTarget-targetContainer" aria-labelledby="firstHeading" data-mw-ve-target-container="">
<div id="contentSub">
<div id="mw-content-subtitle"></div>
</div>
<div id="mw-content-text" class="mw-body-content mw-content-ltr" lang="de" dir="ltr"><div class="mw-content-ltr mw-parser-output" lang="de" dir="ltr"><p><b>Automatic Creation of Literature Abstracts</b> ist eine Arbeit von <a href="Hans_Peter_Luhn" title="Hans Peter Luhn">Hans Peter Luhn</a> von 1958. Sie beschreibt die erste Implementierung eines <a href="Algorithmus" title="Algorithmus">Algorithmus</a> zur <a href="Text-Extraction" title="Text-Extraction">Satzextraktion</a>. Ziel dieser Satzextraktion war die automatische Auswahl von <a href="Satz_(Grammatik)" title="Satz (Grammatik)">Sätzen</a> zur Anfertigung eines <a href="Abstract" title="Abstract">Abstracts</a>.
</p>
<div class="mw-heading mw-heading2"><h2 id="Entstehung">Entstehung</h2></div>
<p>Als sinnvolles Maß für die <a href="Relevanz" title="Relevanz">Relevanz</a> von <a href="Wort" title="Wort">Wörtern</a> sah Luhn die Häufigkeit, mit der ein Wort im Text auftaucht. Die Berechtigung für diese Annahme sieht er darin, dass ein Autor bestimmte Wörter, die mit dem Thema verbunden sind, bei seiner Argumentation und der Beschreibung verschiedener Aspekte wiederholt. Außerdem war er der Meinung, dass die Position von relevanten Wörtern innerhalb eines Satzes etwas über die Wichtigkeit dieses Satzes aussagt. Aus einer Kombination dieser beiden Werte wollte Luhn die Relevanz der Sätze bestimmen.
</p>
<div class="mw-heading mw-heading2"><h2 id="Prinzip">Prinzip</h2></div>
<p>Bei der Durchführung des Algorithmus wird zuerst eine Art „<a href="Inventar" title="Inventar">Inventarliste</a>“ mit allen vorkommenden Wörtern und deren Häufigkeit erstellt. Da Luhn der Meinung war, dass nur Wörter mit mittlerer Häufigkeit etwas über die <a href="Bedeutsamkeit" class="mw-redirect" title="Bedeutsamkeit">Signifikanz</a> eines Satzes aussagen und Wörter mit sehr hoher Häufigkeit eher nichtssagend, weil zu allgemein sind, wollte er diese allgemeinen Wörter mit sehr hohem Vorkommen im Text ausschließen. Er sah zwei Möglichkeiten, dies zu tun:
</p>
<ul><li>Vergleich dieser hochfrequenten Wörter mit einer Liste mit allgemeinen Wörtern und Ausschluss der Wörter, die als allgemein gelten, aus der Berechnung der Relevanz</li>
<li>Festlegen eines oberen und eines unteren Grenzwertes bezüglich der Häufigkeit, um zu allgemeine und zu selten vorkommende Wörter auszuschließen.</li></ul>
<p>Luhn entschied sich für die zweite, einfachere Variante. Um die optimalen Grenzwerte zu finden, musste man sich auf die Erfahrung aus vielen Beispielartikeln verlassen.
</p><p>Der Signifikanzwert eines Satzes berechnet sich aber nicht einfach aus den enthaltenen relevanten Wörtern. Da Luhn die Position und die Beziehung relevanter Wörter auch berücksichtigen wollte, sollten nur Satzteile, welche relevante Wörter enthielten, berücksichtigt werden. Es wurde festgelegt, dass ein relevantes Wort nur dann zu einer Wortgruppe (genannt „Cluster“) gehört, wenn zwischen ihm und dem nächsten relevanten Wort nicht mehr als vier oder fünf unwichtige Wörter stehen. Der Signifikanzfaktor berechnet sich daher wie folgt:
</p>
<dl><dd><span class="mwe-math-element mwe-math-element-inline"><span class="mwe-math-mathml-inline mwe-math-mathml-a11y" style="display: none;"><math xmlns="http://www.w3.org/1998/Math/MathML" alttext="{\displaystyle {\rm {Signifikanzfaktor}}={{\rm {(Anzahl\ signifikanter\ W{\ddot {o}}rter\ der\ Wortgruppe)}}^{2} \over {\rm {Anzahl\ W{\ddot {o}}rter\ der\ Wortgruppe}}}}">
<semantics>
<mrow class="MJX-TeXAtom-ORD">
<mstyle displaystyle="true" scriptlevel="0">
<mrow class="MJX-TeXAtom-ORD">
<mrow class="MJX-TeXAtom-ORD">
<mi mathvariant="normal">S</mi>
<mi mathvariant="normal">i</mi>
<mi mathvariant="normal">g</mi>
<mi mathvariant="normal">n</mi>
<mi mathvariant="normal">i</mi>
<mi mathvariant="normal">f</mi>
<mi mathvariant="normal">i</mi>
<mi mathvariant="normal">k</mi>
<mi mathvariant="normal">a</mi>
<mi mathvariant="normal">n</mi>
<mi mathvariant="normal">z</mi>
<mi mathvariant="normal">f</mi>
<mi mathvariant="normal">a</mi>
<mi mathvariant="normal">k</mi>
<mi mathvariant="normal">t</mi>
<mi mathvariant="normal">o</mi>
<mi mathvariant="normal">r</mi>
</mrow>
</mrow>
<mo>=</mo>
<mrow class="MJX-TeXAtom-ORD">
<mfrac>
<msup>
<mrow class="MJX-TeXAtom-ORD">
<mrow class="MJX-TeXAtom-ORD">
<mo stretchy="false">(</mo>
<mi mathvariant="normal">A</mi>
<mi mathvariant="normal">n</mi>
<mi mathvariant="normal">z</mi>
<mi mathvariant="normal">a</mi>
<mi mathvariant="normal">h</mi>
<mi mathvariant="normal">l</mi>
<mtext> </mtext>
<mi mathvariant="normal">s</mi>
<mi mathvariant="normal">i</mi>
<mi mathvariant="normal">g</mi>
<mi mathvariant="normal">n</mi>
<mi mathvariant="normal">i</mi>
<mi mathvariant="normal">f</mi>
<mi mathvariant="normal">i</mi>
<mi mathvariant="normal">k</mi>
<mi mathvariant="normal">a</mi>
<mi mathvariant="normal">n</mi>
<mi mathvariant="normal">t</mi>
<mi mathvariant="normal">e</mi>
<mi mathvariant="normal">r</mi>
<mtext> </mtext>
<mi mathvariant="normal">W</mi>
<mrow class="MJX-TeXAtom-ORD">
<mrow class="MJX-TeXAtom-ORD">
<mover>
<mi mathvariant="normal">o</mi>
<mo>¨<!-- ¨ --></mo>
</mover>
</mrow>
</mrow>
<mi mathvariant="normal">r</mi>
<mi mathvariant="normal">t</mi>
<mi mathvariant="normal">e</mi>
<mi mathvariant="normal">r</mi>
<mtext> </mtext>
<mi mathvariant="normal">d</mi>
<mi mathvariant="normal">e</mi>
<mi mathvariant="normal">r</mi>
<mtext> </mtext>
<mi mathvariant="normal">W</mi>
<mi mathvariant="normal">o</mi>
<mi mathvariant="normal">r</mi>
<mi mathvariant="normal">t</mi>
<mi mathvariant="normal">g</mi>
<mi mathvariant="normal">r</mi>
<mi mathvariant="normal">u</mi>
<mi mathvariant="normal">p</mi>
<mi mathvariant="normal">p</mi>
<mi mathvariant="normal">e</mi>
<mo stretchy="false">)</mo>
</mrow>
</mrow>
<mrow class="MJX-TeXAtom-ORD">
<mn>2</mn>
</mrow>
</msup>
<mrow class="MJX-TeXAtom-ORD">
<mrow class="MJX-TeXAtom-ORD">
<mi mathvariant="normal">A</mi>
<mi mathvariant="normal">n</mi>
<mi mathvariant="normal">z</mi>
<mi mathvariant="normal">a</mi>
<mi mathvariant="normal">h</mi>
<mi mathvariant="normal">l</mi>
<mtext> </mtext>
<mi mathvariant="normal">W</mi>
<mrow class="MJX-TeXAtom-ORD">
<mrow class="MJX-TeXAtom-ORD">
<mover>
<mi mathvariant="normal">o</mi>
<mo>¨<!-- ¨ --></mo>
</mover>
</mrow>
</mrow>
<mi mathvariant="normal">r</mi>
<mi mathvariant="normal">t</mi>
<mi mathvariant="normal">e</mi>
<mi mathvariant="normal">r</mi>
<mtext> </mtext>
<mi mathvariant="normal">d</mi>
<mi mathvariant="normal">e</mi>
<mi mathvariant="normal">r</mi>
<mtext> </mtext>
<mi mathvariant="normal">W</mi>
<mi mathvariant="normal">o</mi>
<mi mathvariant="normal">r</mi>
<mi mathvariant="normal">t</mi>
<mi mathvariant="normal">g</mi>
<mi mathvariant="normal">r</mi>
<mi mathvariant="normal">u</mi>
<mi mathvariant="normal">p</mi>
<mi mathvariant="normal">p</mi>
<mi mathvariant="normal">e</mi>
</mrow>
</mrow>
</mfrac>
</mrow>
</mstyle>
</mrow>
<annotation encoding="application/x-tex">{\displaystyle {\rm {Signifikanzfaktor}}={{\rm {(Anzahl\ signifikanter\ W{\ddot {o}}rter\ der\ Wortgruppe)}}^{2} \over {\rm {Anzahl\ W{\ddot {o}}rter\ der\ Wortgruppe}}}}</annotation>
</semantics>
</math></span><img src="./_assets_/eb734a37dd21ce173a46342d1cc64c92/b6a4fde57879282c047f97510063661906d5a62b.svg" class="mwe-math-fallback-image-inline mw-invert skin-invert" aria-hidden="true" style="vertical-align: -2.505ex; width:69.4ex; height:6.676ex;" alt="{\displaystyle {\rm {Signifikanzfaktor}}={{\rm {(Anzahl\ signifikanter\ W{\ddot {o}}rter\ der\ Wortgruppe)}}^{2} \over {\rm {Anzahl\ W{\ddot {o}}rter\ der\ Wortgruppe}}}}" loading="lazy"></span></dd></dl>
<p>Nachdem die Sätze entsprechend ihrer Relevanz geordnet wurden, sollte der Satz bzw. die Sätze mit den höchsten Relevanzwerten für die Zusammenfassung ausgewählt werden.
</p>
<div class="mw-heading mw-heading2"><h2 id="Luhns_Bilanz">Luhns Bilanz</h2></div>
<p>Laut Luhn zeigen die Ergebnisse, das heißt die automatisch generierten Extrakte, dass es mit seinem Algorithmus möglich ist, Zusammenfassungen automatisch zu erstellen, die das Hauptthema des Originals fast genau so gut wiedergeben wie herkömmliche Zusammenfassungen.
</p>
<div class="mw-heading mw-heading3"><h3 id="Pro">Pro</h3></div>
<p>Ein Vorteil der so erstellten Zusammenfassungen ist ihre Zuverlässigkeit, <a href="Widerspruchsfreiheit" title="Widerspruchsfreiheit">Konsistenz</a> und Beständigkeit. Dies rührt daher, dass die unterschiedlichen Fähigkeiten und <a href="Orientierung_(mental)" title="Orientierung (mental)">Orientierungen</a> von Menschen keinen Einfluss auf die Zusammenfassung haben. Nach Luhns Meinung werden die Nutzer von Zusammenfassungssystemen nach und nach lernen, wie die erstellten Zusammenfassungen interpretiert werden müssen. So werden die Nutzer erkennen, dass einige Wörter sich auf Bemerkungen aus vorangegangenen, nicht extrahierten Sätzen beziehen.
</p>
<div class="mw-heading mw-heading3"><h3 id="Contra">Contra</h3></div>
<p>Er sieht aber auch einige Nachteile, die die automatisch generierten Zusammenfassungen mit sich bringen. Er nennt zum Beispiel den Verlust der Gewandtheit der Zusammenfassungen. Auch sieht er Probleme, wenn der Stil eines Autors stark von der Allgemeinheit abweicht, da so eventuell geringerwertige Sätze ausgewählt werden können.
</p>
<div class="mw-heading mw-heading3"><h3 id="Ausblick">Ausblick</h3></div>
<p>Trotz der Nachteile ist Luhn der Meinung, dass mit der automatischen Erstellung von Zusammenfassungen beachtliche und lohnende Einsparungen des menschlichen Aufwand erreicht werden können (vgl. H. P. Luhn 1958, Seite 159–165.)
</p><p>Allerdings sah Luhn auch Möglichkeiten, seinen Algorithmus zu verbessern. Zum einen könnte sein Ansatz dahingehend geändert werden, dass Zusammenfassungen von Text zu bestimmten Themen oder Untersuchungsbereichen entstehen. Zum anderen sah er Bedarf, Zusammenfassungen mit variabler Länge generieren zu lassen. So könnten zum Beispiel Zusammenfassungen entstehen, die auf die Bedürfnisse des einzelnen Anwenders zugeschnitten sind. Sollten dann die Signifikanzwerte der einzelnen Sätze nicht über einen bestimmten Grenzwert hinaus kommen, kann der Artikel als „zu allgemein“ für die Nutzerinteressen abgewiesen werden.
</p>
<div class="mw-heading mw-heading2"><h2 id="Literatur">Literatur</h2></div>
<ul><li>H. P. Luhn: <i>Automatic Creation of Literature Abstracts.</i> In: <i>IBM Journal of Research & Development</i> 2 (2), April 1958, Seite 159–165. (<span style="display:none"><a rel="nofollow" class="external text" href="http://deadurl.invalid/http://www.research.ibm.com/journal/rd/022/luhn.pdf">@1</a></span><span style="display:none"><a rel="nofollow" class="external text" href="http://www.research.ibm.com/journal/rd/022/luhn.pdf">@2</a></span><span style="display:none">Vorlage:Toter Link/www.research.ibm.com</span><a rel="nofollow" class="external text" href="http://www.research.ibm.com/journal/rd/022/luhn.pdf">research.ibm.com</a> <small>(Seite nicht mehr abrufbar, festgestellt im August 2025. <a rel="nofollow" class="external text" href="http://timetravel.mementoweb.org/list/2010/http://www.research.ibm.com/journal/rd/022/luhn.pdf">Suche in Webarchiven</a>)</small>) (englisch)</li></ul></div><!--htdig_noindex--><div><div class="zim-footer">
Dieser Artikel wurde von <a class="external text" title="Zuletzt bearbeitet am 2025-08-10" href="https://de.wikipedia.org/wiki/?title=Extraktionsalgorithmus_nach_Luhn&oldid=258741776">Wikipedia</a> herausgegeben. Der Text ist unter <a class="external text" href="https://creativecommons.org/licenses/by-sa/4.0/deed.de">Creative Commons Attribution-Share Alike 4.0</a> verfügbar, sofern nicht anders angegeben. Für die Mediendateien können zusätzliche Bedingungen gelten.
</div>
</div><!--/htdig_noindex--></div>
</div>
</main>
</div>
</div>
</div>
<script src="./_webp_/webpHandler.js"></script>
</body></html>